Skip to content

AI generates covertly racist decisions about people based on their dialect

Hofmann, Kalluri, Jurafsky et al. (2024)

DisciplineInterdisciplinary
MethodExperiment
Tagsalgorithmic fairnesscovert racismdata · digital trace datadialect biaslanguage modelsmethod · descriptive statisticsmethod · machine learningmethod · nlpstereotypes

Summary

Problem: 以往关于语言模型种族偏见的研究主要聚焦于显性种族主义(即明确提及种族群体并映射刻板印象),但社会科学家指出,当代美国社会中的种族主义更多以“色盲”意识形态为基础的隐蔽形式存在。本文旨在探究这种隐蔽种族主义是否在语言模型中体现,具体表现为对非裔美国人英语(AAE)使用者的方言偏见,以及这种偏见是否会影响模型的实际决策(如就业匹配和刑事判决)。 Approach: 作者借鉴社会语言学中的“匹配伪装”技术,提出“匹配伪装探测”方法。该方法向语言模型呈现内容相同或不同的AAE和标准美国英语(SAE)文本,但不明确提及说话者的种族,然后比较模型对说话者特质(如智力、性格)的预测差异。研究涵盖12个模型版本(GPT2、RoBERTa、T5、GPT3.5、GPT4),并应用于就业匹配和刑事判决两个决策场景。 Finding: 语言模型对AAE使用者表现出比人类历史上记录的最负面种族刻板印象(1930年代)更为负面的隐蔽刻板印象,且这些刻板印象与1933年和1951年的普林斯顿三部曲研究高度吻合。与此同时,模型的显性刻板印象(明确提及非裔美国人时)却比人类记录的最正面态度更为正面。方言偏见直接影响决策:模型更倾向于将AAE使用者匹配到低声望职业,并在假设性审判中更频繁地判处AAE使用者死刑。扩大模型规模或使用人类反馈对齐训练并不能缓解隐蔽偏见,反而会加剧隐蔽与显性刻板印象之间的差距。 Significance: 该研究首次揭示了语言模型中隐蔽种族主义的存在及其与显性偏见的根本差异,表明当前主流的偏见缓解方法(如人类反馈对齐)只是表面掩盖了种族主义,并未触及深层偏见。这对语言技术的公平与安全使用具有深远影响,也为AI伦理研究开辟了新的方向。

Theoretical Framework

  • Theoretical tradition: 该研究属于社会语言学与计算社会科学的交叉领域,借鉴了批判种族理论中的“新种族主义”和“色盲种族主义”概念,以及拉伊奥语言学(raciolinguistics)的理论视角。
  • Prior theories built upon: 论文明确引用了“新种族主义”理论(Bonilla-Silva等)、“匹配伪装”技术(社会语言学经典方法)、普林斯顿三部曲(Katz & Braly, Devine等关于种族刻板印象的经典研究),以及拉伊奥语言学中关于AAE被“他者化”的论述。
  • Causal mechanism: 语言模型在训练数据中习得了人类社会中存在的种族刻板印象。当输入文本包含AAE的方言特征时,这些特征作为触发线索激活了模型内部的隐蔽种族联想,从而影响模型对说话者的判断和决策。该机制不依赖于明确提及种族,而是通过方言特征间接激活。
  • Key assumptions: 该理论假设:(1) 语言模型的训练数据编码了人类社会中的种族偏见;(2) AAE方言特征在模型中被赋予了种族化的意义;(3) 隐蔽偏见与显性偏见是两种独立且不同的认知机制;(4) 人类反馈对齐训练主要影响模型的表面输出,而不改变深层联想。
  • Theoretical move: 本文扩展了现有关于语言模型种族偏见的研究,将焦点从显性种族主义转向隐蔽种族主义,并挑战了“更大模型或人类反馈对齐可以缓解偏见”的主流假设,证明这些方法反而加剧了隐蔽与显性偏见的差距。同时,论文应用了社会语言学中的匹配伪装技术到AI领域,提出新的方法论工具。
  • Scope conditions: 研究聚焦于美国语境下的AAE与SAE对比,结论可能不直接推广到其他方言、语言或种族群体。作者指出,隐蔽偏见的具体表现可能因方言特征、模型类型和任务场景而异。

Research Design

本研究为实验设计,采用“匹配伪装探测”方法。分析单元为语言模型对文本说话者的预测输出。关键自变量为文本方言(AAE vs. SAE),分为“意义匹配”和“意义不匹配”两种设置。因变量包括:(1) 说话者特质形容词的关联强度(隐蔽刻板印象);(2) 职业匹配得分(就业决策);(3) 定罪率和死刑判决率(刑事决策);(4) 智力判断(IQ)。所有实验均不向模型明确提及说话者的种族。

Data & Sample

研究使用公开可得的AAE和SAE文本对。AAE文本来自Twitter等社交媒体平台,SAE文本为AAE的翻译版本(意义匹配设置)或独立文本(意义不匹配设置)。共考察12个语言模型版本,包括GPT2、RoBERTa、T5、GPT3.5和GPT4。具体样本量:就业分析涉及84个职业(t(83)),刑事判决实验涉及96个(定罪)和144个(死刑)判断。时间跨度为2023-2024年(模型发布和实验执行时间)。数据来源为公开模型API和预训练模型。

Analytical Strategy

主要分析方法包括:(1) 平均精度变体(average precision)用于量化模型隐蔽刻板印象与人类普林斯顿三部曲刻板印象的一致性,通过10,000次随机排列的置换检验评估显著性;(2) 单侧t检验比较模型与随机基线的一致性;(3) 线性回归分析职业声望与AAE关联度之间的关系(β = −7.8, R² = 0.193);(4) 卡方检验比较AAE与SAE条件下的定罪率和死刑率差异;(5) 对模型规模(GPT2小/中/大、T5各版本)和人类反馈训练(GPT3 vs. GPT3.5)进行对比分析。控制变量包括文本长度、内容主题等,并通过意义匹配设置控制语义差异。稳健性检验包括使用其他方言(如阿巴拉契亚英语)和噪声文本排除替代解释。

Results & Findings

  • 隐蔽刻板印象的存在与强度:所有12个语言模型均对AAE使用者表现出显著高于随机水平的负面刻板印象。这些刻板印象与1933年和1951年普林斯顿三部曲中人类对非裔美国人的刻板印象高度一致(如“无知”“懒惰”“愚蠢”),且其负面程度超过人类历史上记录的最负面态度。该发现对所有模型、设置和提示词均成立。
  • 隐蔽与显性偏见的矛盾:模型的显性刻板印象(明确提及非裔美国人时)总体为正面(如“才华横溢”),与2012年人类态度最接近;而隐蔽刻板印象为负面,与1930年代人类态度最接近。两者呈相反的时间趋势。对于经过人类反馈训练的GPT3.5和GPT4,这种矛盾最为突出——显性全部正面、隐蔽全部负面。这证实了隐蔽偏见是一种与显性偏见根本不同的偏见类型。
  • 方言特征与刻板印象的直接关联:所有考察的AAE语言特征(如习惯体“be”、将来时“finna”、系词省略等)均单独触发显著的刻板印象,且特征密度越高,刻板印象越强。排除实验表明,该现象不能归因于对非标准文本的一般性负面态度或对偏离SAE的笼统反应。
  • 就业决策中的偏见:模型显著更倾向于将AAE使用者匹配到低声望职业(如厨师、士兵、警卫),而将SAE使用者匹配到需要大学学历的职业(如心理学家、教授、经济学家)。线性回归证实职业声望与AAE关联度呈显著负相关。该趋势对所有模型成立,但GPT3.5在音乐娱乐类职业上表现出特别强的AAE关联。
  • 刑事决策中的偏见:在假设性审判中,AAE使用者的定罪率(68.7%)显著高于SAE使用者(62.1%);在已定一级谋杀罪的案件中,AAE使用者的死刑判决率(27.7%)显著高于SAE使用者(22.8%)。除T5基础版本外,该趋势对所有模型成立。
  • 智力判断中的偏见:所有模型一致判断AAE使用者的IQ低于SAE使用者。
  • 偏见缓解方法的失效:扩大模型规模确实改善了AAE的处理能力并减少了显性偏见,但反而增加了隐蔽偏见。人类反馈对齐训练(GPT3 vs. GPT3.5)显著改善了显性刻板印象(更弱、更正面),但对隐蔽刻板印象的强度和负面性没有显著影响,从而加剧了两者之间的差距。
  • 意外发现:作者发现隐蔽偏见与显性偏见呈相反的时间趋势(隐蔽对应1930年代、显性对应2012年),这一结果出乎意料,揭示了语言模型内部可能存在两套独立的种族联想系统。

Limitations

作者在文中承认以下局限:(1) 研究仅聚焦于美国语境下的AAE与SAE对比,未涵盖其他方言、语言或种族群体;(2) 实验场景为假设性任务(如模拟审判),实际部署中的决策过程可能更为复杂;(3) 非意义匹配设置中,方言与内容的天然相关性可能混淆了方言本身的影响;(4) 研究未深入探讨隐蔽偏见产生的具体训练机制;(5) 对“隐蔽”与“显性”的区分依赖于实验操作,实际认知过程中的界限可能更为模糊。

Key Contributions

  • 首次提供语言模型存在方言偏见(隐蔽种族主义)的经验证据,将AI偏见研究从显性层面拓展到隐蔽层面。
  • 提出“匹配伪装探测”方法,为检测语言模型中的隐蔽偏见提供了可复用的方法论工具。
  • 揭示隐蔽偏见与显性偏见的根本差异及其矛盾关系,证明两者是独立的偏见机制。
  • 证明当前主流偏见缓解方法(模型规模扩大、人类反馈对齐)无法解决隐蔽偏见,甚至可能加剧问题。
  • 将社会语言学中的匹配伪装技术和普林斯顿三部曲经典研究引入AI伦理领域,促进跨学科对话。
  • 为语言技术的公平性评估提供了新的维度,对AI部署中的决策公平具有直接政策启示。

Key Claims

"Here, we demonstrate that language models embody covert racism in the form of dialect prejudice, exhibiting raciolinguistic stereotypes about speakers of African American English (AAE) that are more negative than any human stereotypes about African Americans ever experimentally recorded." (Abstract)

"Dialect prejudice has the potential for harmful consequences: language models are more likely to suggest that speakers of AAE be assigned less-prestigious jobs, be convicted of crimes and be sentenced to death." (Abstract)

"Finally, we show that current practices of alleviating racial bias in language models, such as human preference alignment, exacerbate the discrepancy between covert and overt stereotypes, by superficially obscuring the racism that language models maintain on a deeper level." (Abstract)

"Strikingly, the language models’ covert and overt racial prejudices are often in contradiction with each other, especially for the most recent language models that have been trained with HF (GPT3.5 and GPT4). These two language models obscure the racism, overtly associating African Americans with exclusively positive attributes (such as ‘brilliant’), but our results show that they covertly associate African Americans with exclusively negative attributes (such as ‘lazy’)." (Discussion)

"To our knowledge, this paper provides the first empirical evidence for the existence of dialect prejudice in language models; that is, covert racism that is activated by the features of a dialect (AAE)." (Introduction)


My Notes